iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI Engineering

生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則系列 第 29

第 29 律:答案只花十秒,為什麼我還花了一小時?

  • 分享至 

  • xImage
  •  

昨天談中斷。今天談成本。

模型十秒回了一個答案。你接下來一小時在做什麼?

定律

我目前把它寫成這樣:

流程效率要在相同交付標準與成本邊界下比較,不能用其中一個便宜步驟代替整體成本。

前提是:交付標準相同。兩個流程要比的是「到通過同一份驗收為止」花了多少,不是第一份草稿花了多少。

它也不是在說慢的、多步的流程比較划算。某些成本未來可以降到零。實測若便宜模型總成本也最低,就如實採用。本律只反對一件事:拿最便宜的那一步當整體成本。

還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。

今晚做了什麼

材料

三個門市的營收和退貨金額。目標:算退貨率、排序、找最低。

兩個流程,資料相同:

前置
Q 快速產出 一句「請算出三家的退貨率並排序,找出最低的一家」
P 前置設定 同上,加四條驗收條件:小數一位;由低到高;最後一行「最低:店名」;恰好四行,每行「店名 退貨率%」

只做第一輪。量第一輪對照同一份四條驗收的落差,和輸出長度。

模型是 Claude Haiku 4.5,每組五次,共十次。

量什麼

四條驗收逐條判,通過等於 4/4。未通過項數是至少還要一輪返工的下限。輸出字元數當產出成本的代理。程式判。

事先寫下的預期

Q 的第一輪短,但對照驗收會有未通過項。P 的第一輪含條件,通過率高。如果 Q 也 4/4,便宜流程總成本最低,如實採用。

材料、判準、預期,在第一次呼叫之前提交進版本控制。

結果

第一輪通過 平均未通過項 平均輸出字元
Q 快速產出 0/5 3.0 333
P 前置設定 5/5 0.0 29

Q 五次,數字全對,排序對,最低對。全部包在 markdown 標題、計算過程、表格、結語裡。對照驗收:數值那條過,其他三條全不過。每次至少還要一輪。

P 五次,逐字等於我預期的四行。29 字。

落在事先寫的「示範」情形。

快在哪裡

我以為 Q 會比較快。提示詞確實比較短,少了四行。

然後它回了 333 字。P 回了 29 字。Q 的答案是 P 的十一倍長,而且還不能用,要再改一輪。

「快」只在我打字的那幾秒。之後每一步都比較貴:讀 333 字找出那三個數字、發現格式不對、寫第二輪回饋、等第二輪、再對一次驗收。這些都是成本。它們沒有消失,只是從前面挪到後面。

內容對,交付不對

Q 組的內容一個字都沒錯。我要說清楚這件事。

驗收條件裡有三條是格式:最後一行寫什麼、幾行、每行長什麼樣。Q 組沒被告知,失分是我設計的。有人會說這不公平。

但這就是「相同交付標準」的意思。我要的東西是四行,不是一份報告。一份內容正確的報告,對照這個標準,還是要返工。標準不會因為內容對就放寬。

三件這次不能往外推的事

第一,一份資料、四條條件、每組五次、只一輪。 返工沒真的跑,未通過項是下限。

第二,時間沒量。 用字元數代理。

第三,沒出現「便宜流程總成本也最低」的情況。 那種任務存在,今晚不是。

這條律怎麼被推翻

這條律是關於「怎麼比較」的規則,不被單次結果推翻。能被推翻的是「P 的前置成本值得」這個版本假說:如果 Q 五次都 4/4,四行條件就是白寫的。今晚 Q 零次。

另一條路:某個任務下 Q 的第一輪就過,那就用 Q。本律不反對。

下一次覺得「這樣比較快」時多做的一件事

算到驗收為止。

不是算到第一份東西出來。是算到你可以拿它去用為止。今晚 Q 的第一份東西十秒出來,P 的也是。差別在 Q 的十秒之後還有一小時,P 的十秒之後沒有。

紀錄表這次加的是一欄:「到通過驗收為止的輪數」。

本文的協作紀錄是:資料、兩份提示詞、四條驗收、判定程式與預期在任何一次呼叫之前提交,之後未修改;十次輸出逐字保留,判定由程式執行。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。

下一篇是最後一篇:工作交給 AI 之後,哪些決定由誰負責。


上一篇
第 28 律:能自動做完很重要,做壞了能接回來也很重要
系列文
生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言